AI资讯新闻榜单内容搜索-Claude

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: Claude
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。

来自主题: AI技术研报
9417 点击    2026-09-06 11:05
海外用户爱中国模型,为何不爱大厂AI办公

海外用户爱中国模型,为何不爱大厂AI办公

海外用户爱中国模型,为何不爱大厂AI办公

腾讯WorkBuddy、阿里QwenWork等中国大厂AI办公产品出海面临获客成本高企、难以撼动Claude Code和Codex等海外成熟工具用户心智、品牌信任与数据合规门槛较高以及本地化不足等现实阻力,尽管中国AI模型凭借性价比在海外广受欢迎,国产AI办公Agent却尚未打开海外市场。

来自主题: AI资讯
9184 点击    2026-09-06 11:03
GPT-6第1天直接攻破5道Erdős难题!Fable 5.1交了白卷

GPT-6第1天直接攻破5道Erdős难题!Fable 5.1交了白卷

GPT-6第1天直接攻破5道Erdős难题!Fable 5.1交了白卷

在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。

来自主题: AI资讯
7918 点击    2026-09-05 10:53
Manus团队测模型一点微小的经验

Manus团队测模型一点微小的经验

Manus团队测模型一点微小的经验

Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。

来自主题: AI资讯
8918 点击    2026-09-05 10:46
CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

CC、Codex都没防住:13种攻击全部打穿,连权限审查都能绕过,问题竟出在SubAgent

研究发现SubAgent等上下文重建机制会将工具层的恶意指令提权为用户消息或系统指令,导致Claude Code、Codex、Gemini CLI、Qwen Code、Kimi和OpenCode六款AI编码框架在13类攻击上全部沦陷,连自动权限审核(Auto PR)也被绕过。

来自主题: AI技术研报
7772 点击    2026-09-04 15:51
让AI长出“科研大脑”,Inherent获5000万美元种子融资|AlphaFounders

让AI长出“科研大脑”,Inherent获5000万美元种子融资|AlphaFounders

让AI长出“科研大脑”,Inherent获5000万美元种子融资|AlphaFounders

前DeepMind AI Scientist团队创立的Inherent获5000万美元种子融资,其基于Qwen3.6-27B后训练的科研判断系统Faraday在AI for Science预留测试集上以0.791的平均得分超越Claude Opus 4.8与GPT-5.5 Codex。

来自主题: AI资讯
9054 点击    2026-09-03 10:03
Scaling 的不只是模型:EvoX 想做下一个入口

Scaling 的不只是模型:EvoX 想做下一个入口

Scaling 的不只是模型:EvoX 想做下一个入口

EvoMap团队推出自进化智能体EvoX,采用无中心调度的蜂群模式让大量Agent平级协作、自主组队,在563道逻辑、数学、物理题上将Claude Haiku 4.5的正确率从单Agent的26.29%提升至70%以上,并开源AutoResearch项目构建Agent经验基础设施。

来自主题: AI资讯
9718 点击    2026-09-02 16:18
突发!Fable 5.1遭黑客破解,27万字提示词泄露

突发!Fable 5.1遭黑客破解,27万字提示词泄露

突发!Fable 5.1遭黑客破解,27万字提示词泄露

Claude Fable 5.1发布数小时内即遭知名黑客Pliny the Liberator越狱,其在GitHub公开泄露了超27万字的完整系统提示词,曝光了模型的安全规则、记忆禁区及46个内置工具架构等核心细节。

来自主题: AI资讯
10005 点击    2026-09-02 10:59
刚刚,神话级Fable 5.1来了!

刚刚,神话级Fable 5.1来了!

刚刚,神话级Fable 5.1来了!

一觉醒来,Anthropic再次改写了机器智能的坐标系。

来自主题: AI资讯
8552 点击    2026-09-02 10:06
刚刚,Claude 5.1 发布!全球最强模型来了

刚刚,Claude 5.1 发布!全球最强模型来了

刚刚,Claude 5.1 发布!全球最强模型来了

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。

来自主题: AI资讯
10063 点击    2026-09-02 08:50